Odkriti novi vdori modelov umetne inteligence Anthropic in OpenAI

Najbolj drzen je bil agent Anthropica, ki je v testu britanskega inštituta izvedel 17 od 19 odkritih kršitev, vključno z ustvarjanjem lažnih identitet.
Britanski inštitut za varnost umetne inteligence (AI Security Institute oziroma AISI) je v torek razkril, da je agent umetne inteligence ustvarjal lažne spletne identitete za pridobitev nepooblaščenega dostopa do zaprtih sistemov med testiranjem modelov OpenAI in Anthropic. Testiranje je razkrilo vrsto novih kršitev, po tem, ko sta več kibernetskih vdorov zaznala že razvijalca sama, poroča Reuters.
Inštitut je sporočil, da so agenti, ki jih poganjata Anthropicov model mythos 5 in OpenAIjev model GPT-5.6-sol, med varnostnimi ocenami, ki jih je izvedla vladna organizacija za oceno zmogljivosti modelov, izvajali nepooblaščena dejanja. “Nekateri testirani agenti so se ukvarjali s trajnimi, potencialno škodljivimi dejavnostmi, usmerjenimi proti resničnim ljudem in organizacijam,” je AISI zapisal v objavi na blogu.
Poročilo kaže na pomanjkanje varovalk v procesu testiranja agentov umetne inteligence, ki jih podjetja v sektorju obenem tržijo kot prihodnost poslovanja.
Večino kršitev izvedel agent Anthropica
AISI, ki dostop do naprednih modelov umetne inteligence dobi v okviru prostovoljnih sporazumov z večjimi laboratoriji, je agente preizkusil v hipotetičnem scenariju kibernetske varnosti. Izziv so izvedli 122-krat in v skupno 10 testnih izvedbah odkrili 19 nesankcioniranih dejanj. Za 17 dejanji je stal agent podjetja Anthropic, za preostalima dvema pa agent podjetja OpenAI.
Najbolj očitno nedovoljeno dejanje je bilo pisanje zlonamerne kode in ustvarjanje lažnih spletnih identitet, da bi prepričal človeka, da odobri kodo, je sporočil AISI. Dodali so, da zaradi nobene od ugotovljenih kršitev ni nastala resnična škoda.
Čeprav AISI ni povedal, kateri agent stoji za lažnimi identitetami, je Antropic potrdil, da je bil odgovoren njegov agent. “Hvaležni smo britanskemu AISI za njihovo vodstvo pri tem incidentu, ki poudarja potrebo po širšem pogovoru o tem, kako varno oceniti vse bolj zmogljive agente umetne inteligence,” je Anthropic dejal v izjavi.
Andrew Yoon, raziskovalec pri kalifornijski neprofitni organizaciji CivAI, ki preučuje zmogljivosti in nevarnosti umetne inteligence, je za Reuters dejal: “Dejstvo, da se je mythos lotil takšnih zavajajočih dejanj, z očitnim zavedanjem, da cilja na resnično osebo, kaže na to, da Anthropic ne obvlada svojih modelov tako dobro, kot misli.”
OpenAI-jev agent kršil prepoved
OpenAI je podrobnosti delil v objavi na blogu podjetja in opozoril, da sta obe neodobreni dejanji njegovega agenta vključevali dostop do interneta na načine, ki jih je poziv prepovedal.
“Zavezani smo k sodelovanju v celotni panogi, da bi okrepili skupne prakse za varno izvajanje ocenjevanja z visokim tveganjem, vključno s sklicem deležnikov, kot so nacionalni inštituti za umetno inteligenco, neodvisni ocenjevalci, drugi laboratoriji za umetno inteligenco in druge skupine v prihodnjih tednih,” je dejal OpenAI.
OpenAI je v objavi razkril tudi ločen incident, pri katerem je napačna konfiguracija zunanjega ponudnika testiranja Irregular omogočila njegovim agentom, da so se pomotoma povezali z internetom. Podobno razkritje o napačni konfiguraciji je Anthropic podal prejšnji teden.
Agenti so imeli dostop do interneta
Za razliko od julijskega vdora OpenAI-jevega agenta v platformo za umetno inteligenco Hugging Face, agenti v oceni AISI niso ušli iz izoliranega testnega okolja, da bi dosegli internet. Namesto tega je agencija dovolila dostop do interneta v skladu s svojimi standardnimi postopki testiranja, je sporočil AISI.
OpenAI je od takrat tudi razširil svojo preiskavo, saj je odkril dokaze o dodatnih vdorih agentov, še piše Reuters.
O vse večji grožnji umetne inteligence za kibernetsko varnost smo pri Forbes Slovenija govorili s strokovnjakom za kibernetsko varnost Gregorjem Spagnolom iz podjetja SSRD, ki je razložil, kako model umetne inteligence pobegne iz tako imenovanega peskovnika, pa tudi, kako se posamezniki in podjetja najbolje zaščitijo na spletu.